142 Scikit-learn_기초
Scikit-learn 기초는 전처리, 지도학습, 비지도학습, 모델 평가, 파이프라인을 Python 기반 머신러닝 실습으로 익히는 과정이다.
0. 교육을 하는 이유와 궁극적인 목표
Scikit-learn 기초 교육의 궁극적인 목표는 학습자가 표 데이터 기반 예측 문제를 정의하고, 전처리부터 모델 학습·평가·해석까지 재현 가능한 머신러닝 워크플로를 만들 수 있게 하는 것이다. 민간 머신러닝 부트캠프 흐름처럼 알고리즘 이름 암기보다 데이터 분할, 누수 방지, 교차검증, 성능지표 선택, Pipeline 구성, 결과 해석을 실무 기준으로 훈련한다.
참고한 유료형 교육 흐름
- DataCamp식 실제 데이터셋 기반 supervised learning 실습 흐름
- Udemy형 scikit-learn 주제별 모델 구현과 성능 비교 방식
- Kaggle형 feature engineering·validation·leaderboard 개선 훈련
- 기업 직무교육에서 강조하는 모델 평가·해석·재현성 중심 구성
입문 · 1일
머신러닝 예측 첫걸음
분류와 회귀 문제를 만들고 첫 모델을 학습한다.



| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | ML 문제 유형을 구분한다 | 타이타닉 생존, 주택가격, 고객 이탈 사례를 분류·회귀·군집 문제로 나눈다. target, feature, sample, label 개념을 데이터 표에 직접 표시한다. |
| 목표 2 | 첫 모델을 학습한다 | train_test_split으로 데이터를 나누고 DecisionTreeClassifier 또는 LogisticRegression을 학습한다. predict 결과와 실제 값을 비교해 맞은 사례와 틀린 사례를 표로 정리한다. |
| 목표 3 | 기본 성능을 해석한다 | accuracy, confusion matrix, mean absolute error의 의미를 예제별로 계산한다. 성능이 높은데도 위험할 수 있는 불균형 데이터 사례를 토론한다. |
| 사용 플랫폼 | Python, scikit-learn, pandas, Google Colab, Matplotlib |
|---|---|
| 강사 스펙 | 머신러닝 입문, scikit-learn 기본 모델, 성능지표 설명 경험 3년 이상 |
| 수업대상 | Python 기초 가능자, AI 입문자, 데이터분석 초급자 |
| 소요시간 | 4-6시간 |
| 준비물 | 노트북, Colab 계정, 분류/회귀 샘플 데이터 |
| 산출물 | 첫 예측 모델, 성능표, 오류 사례 분석표 |
| 평가방법 | 문제구분 25%, 모델학습 30%, 지표해석 25%, 오류분석 10%, 참여도 10% |
초급 · 3일
전처리와 모델 비교 과정
다양한 알고리즘을 같은 기준으로 비교한다.



| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 전처리를 적용한다 | SimpleImputer, StandardScaler, OneHotEncoder로 결측·수치·범주 데이터를 처리한다. 전처리 전후 모델 성능을 비교해 전처리가 필요한 이유를 확인한다. |
| 목표 2 | 여러 모델을 비교한다 | LogisticRegression, KNeighbors, RandomForest, GradientBoosting을 같은 데이터에 적용한다. 모델별 학습시간, 성능, 해석 가능성을 비교표로 만든다. |
| 목표 3 | 데이터 누수를 방지한다 | 스케일링을 전체 데이터에 먼저 적용한 경우와 Pipeline 내부에서 적용한 경우를 비교한다. train/validation/test 분리 규칙을 만들고 잘못된 실험 설계를 수정한다. |
| 사용 플랫폼 | Python, scikit-learn, pandas, NumPy, Jupyter Notebook, seaborn |
|---|---|
| 강사 스펙 | 전처리, 모델 비교, 데이터 누수 방지 지도 경험 3년 이상 |
| 수업대상 | 데이터 분석 초급자, 머신러닝 입문 개발자, 기업 실무 교육생 |
| 소요시간 | 12-18시간 |
| 준비물 | 분류 데이터셋, 전처리 실습 노트북, 성능 비교표 템플릿 |
| 산출물 | 전처리 코드, 모델 비교 리포트, 누수 방지 체크리스트 |
| 평가방법 | 전처리 25%, 모델비교 30%, 누수방지 20%, 리포트 15%, 발표 10% |
초급 · 1주
평가·검증·튜닝 과정
교차검증과 하이퍼파라미터 탐색으로 모델을 개선한다.


| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 검증 전략을 설계한다 | KFold, StratifiedKFold, cross_val_score로 안정적인 성능 추정을 수행한다. 데이터 크기와 클래스 불균형에 따라 검증 방식을 선택하는 기준표를 만든다. |
| 목표 2 | 하이퍼파라미터를 탐색한다 | GridSearchCV와 RandomizedSearchCV로 RandomForest 또는 SVM 파라미터를 조정한다. 탐색 결과를 cv_results_로 정리하고 성능과 시간의 균형을 해석한다. |
| 목표 3 | 성능지표를 선택한다 | precision, recall, F1, ROC-AUC를 고객 이탈·사기 탐지 사례에 적용한다. 업무 비용 관점에서 어떤 오류가 더 위험한지 비용 행렬로 표현한다. |
| 사용 플랫폼 | Python, scikit-learn, pandas, NumPy, Matplotlib, Jupyter Notebook |
|---|---|
| 강사 스펙 | 교차검증, 하이퍼파라미터 튜닝, 분류 지표 해석 경험 4년 이상 |
| 수업대상 | 머신러닝 프로젝트반, 취업 포트폴리오 준비생, 데이터 직무 교육생 |
| 소요시간 | 20-30시간 |
| 준비물 | 중간 규모 표 데이터, Colab 또는 로컬 Python 환경, 평가 설계표 |
| 산출물 | 튜닝된 ML 모델, 검증 리포트, 비용 기반 지표 선택표 |
| 평가방법 | 검증설계 25%, 튜닝 30%, 지표선택 25%, 해석 10%, 발표 10% |
중급 · 4주
ML 파이프라인 제작 과정
전처리·학습·평가·저장을 하나의 구조로 만든다.



| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | Pipeline을 구성한다 | ColumnTransformer와 Pipeline으로 수치·범주 전처리와 모델을 연결한다. 전처리 컬럼이 바뀌어도 유지 가능한 코드 구조로 리팩터링한다. |
| 목표 2 | 모델 해석을 수행한다 | permutation importance와 partial dependence로 주요 변수 영향을 확인한다. SHAP 또는 eli5를 활용해 개별 예측 결과의 이유를 설명한다. |
| 목표 3 | 모델을 저장하고 재사용한다 | joblib으로 Pipeline 모델을 저장하고 새 데이터에 예측을 수행한다. FastAPI 또는 Streamlit으로 CSV 업로드 후 예측 결과를 반환하는 데모를 만든다. |
| 사용 플랫폼 | Python, scikit-learn, pandas, joblib, SHAP, Streamlit, FastAPI |
|---|---|
| 강사 스펙 | ML Pipeline, 모델 해석, 예측 데모 구현 경험 4년 이상 |
| 수업대상 | AI 개발 중급자, 기업 데이터팀, ML 서비스 입문자 |
| 소요시간 | 40-60시간 |
| 준비물 | 실전형 CSV 데이터, GitHub 저장소, Streamlit/FastAPI 환경 |
| 산출물 | 재사용 가능한 ML Pipeline, 모델 해석 리포트, 예측 데모 앱 |
| 평가방법 | 파이프라인 30%, 해석 25%, 저장재사용 20%, 데모 15%, 발표 10% |
심화 · 8주
Scikit-learn 실전 프로젝트 과정
비즈니스 예측 문제를 모델링하고 운영 기준까지 설계한다.



| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 예측 프로젝트를 정의한다 | 이탈 예측, 수요 예측, 신용 위험, 교육 성취 예측 중 하나를 선택해 목표와 지표를 정한다. 데이터 수집 범위, 금지 변수, 개인정보 처리, 모델 사용 한계를 명세서로 작성한다. |
| 목표 2 | 모델 운영 기준을 만든다 | baseline, 후보 모델, 튜닝 모델의 성능·해석성·운영비용을 비교한다. drift 감지, 재학습 주기, 실패 케이스 수집 절차를 운영 문서로 정리한다. |
| 목표 3 | 최종 제안서를 발표한다 | 예측 결과를 업무 의사결정에 어떻게 연결할지 시나리오를 만든다. 모델 카드, 데이터 카드, API 명세, 리스크 대응표를 포함해 최종 발표한다. |
| 사용 플랫폼 | Python, scikit-learn, pandas, SHAP, MLflow, FastAPI, Docker, GitHub |
|---|---|
| 강사 스펙 | ML 프로젝트 PM, 모델 운영 문서화, 데이터 윤리·리스크 관리 경험 5년 이상 |
| 수업대상 | AI 강사, 기업 AI 리더, 취업 포트폴리오 심화반 |
| 소요시간 | 80-120시간 |
| 준비물 | 프로젝트 데이터셋, 모델카드 양식, GitHub 저장소, 발표 템플릿 |
| 산출물 | ML 포트폴리오, 모델카드, 운영 기준서, 예측 서비스 제안서 |
| 평가방법 | 문제정의 20%, 모델성능 25%, 운영설계 25%, 문서화 20%, 발표 10% |